前兩天談來源。今天談語氣。
同一個問題,兩個回答。一個說「上限是 30 人,這一點很明確」。一個說「我不太確定,印象中可能是 30 人」。哪個比較可信?
我目前把它寫成這樣:
在沒有有效校準或其他保證時,流暢與肯定的表達本身不足以保證內容正確。
前提是:沒有校準、沒有其他保證。如果一個系統的信心經過校準,「我確定」跟正確率有對應關係,那校準證據可以納入判讀。本律說的是沒有那種證據的時候。
它也不是在說人一定會被語氣騙。有沒有被騙是實驗問題。本律只說:語氣本身不是證據。
還有一條老規矩:沒跑過的實驗不能寫得像有結果;小樣本不能說成普遍現象。
先講一件事。這條律講的是人的判讀。今晚我沒有人類讀者,用模型當讀者的代理。結果不外推到人。
一個問題:虛構工作坊 10 月場次的報名上限。真值 30 人。四個回答,2×2:
| 肯定語氣 | 保留語氣 | |
|---|---|---|
| 事實對(30 人) | 「上限是 30 人。這一點很明確……」 | 「我不太確定,印象中可能是 30 人……」 |
| 事實錯(40 人) | 「上限是 40 人。這一點很明確……」 | 「我不太確定,印象中可能是 40 人……」 |
對與錯之間,措辭逐字平行,只換數字。
讀者是 Claude Haiku 4.5,評 1 到 5 的可信程度。兩種讀者條件:N,讀者沒有任何參考資料,只能看回答本身,每格五次;T,讀者拿到一句可視為正確的參考資料,每格三次。共 32 次。
一個整數。按格算平均。
N 條件:讀者不知道真值,四個回答只差一個數字。預期評分跟語氣走,對錯評分相同,而且肯定語氣比保留語氣高。
T 條件:讀者有參考資料。預期評分轉而跟事實走。
材料、判準、預期,在第一次呼叫之前提交進版本控制。
| 條件 | 對+肯定 | 對+保留 | 錯+肯定 | 錯+保留 |
|---|---|---|---|---|
| N 無真值 | 1.40 | 2.40 | 1.40 | 2.00 |
| T 有真值 | 3.67 | 2.67 | 1.00 | 1.67 |
N 條件:對和錯在同一語氣下評分一樣。肯定語氣的兩格都是 1.40。這半句如預期。
另外半句,錯了。我預期肯定語氣評分比較高。結果是比較低。
T 條件:評分跟事實走了。對的兩格 3.67 和 2.67,錯的兩格 1.00 和 1.67。而且這時候肯定語氣才變成加分:對加肯定 3.67,對加保留 2.67。
先看 N 條件對得上預期的部分。
對加肯定 1.40,錯加肯定 1.40。一模一樣。對加保留 2.40,錯加保留 2.00,差不多。讀者手上沒有真值,它的評分裡就沒有任何關於真值的資訊。它能評的只有語氣。
這就是本律的內容。肯定語氣本身不帶正確性。同一句「這一點很明確」,接 30 人和接 40 人,得到同樣的分數。
我猜肯定語氣會拉高分數。這個讀者反過來。
想一下它看到什麼:一個它從沒聽過的工作坊,一個它無從查證的數字,然後一句「這一點很明確,沒有例外」。它給 1 到 2 分。同一件事說「我不太確定,建議再確認」,它給 2 分。
它對無從查證的事講得斬釘截鐵,是扣分的。
這是這個模型的反應,不是人的。人會不會這樣,本次沒測。但這個結果剛好是本律要的另一面:語氣是可以被獨立評價的東西,跟內容分開。這個讀者把「過度肯定」當成一個負面訊號,跟內容對不對無關。
T 條件給讀者一句參考資料。評分立刻跟事實走:對的高,錯的低。
這時候肯定語氣才變成加分。對加肯定 3.67,高於對加保留 2.67。當讀者能核對內容的時候,一個既對又肯定的回答,比一個對但猶豫的回答可信。
所以「肯定語氣是好是壞」沒有固定答案。有保證時,肯定加分。沒保證時,這個讀者把它當警訊。本律說的「在沒有其他保證時」,就是這個分界。
第一,讀者是模型,不是人。 本律講人的判讀,今晚只量了代理。
第二,一題、四個回答、每格三或五次。
第三,語氣和內容量沒有完全分離。 肯定版比保留版多了一句具體理由。
這條律是關於「不足以保證」的陳述,一個反例就夠:找到一個沒有校準的系統,它的肯定語氣跟正確率有穩定對應。今晚 N 條件裡對錯評分相同,沒有這種對應。
我自己的預期「肯定語氣拉高評分」被推翻了,方向相反。判準沒有回改,結果如實記。
問:它明確的依據,我看得到嗎。
看得到,去看,語氣就不重要了。看不到,那句「很明確」就是今晚 N 條件裡的東西:跟內容無關的一個訊號。今晚的讀者把它當警訊。你可以自己決定要不要。
紀錄表這次加的是一欄:「肯定的依據在哪」。
本文的協作紀錄是:四個回答、八份提示詞、判定程式與預期在任何一次呼叫之前提交,之後未修改;32 次評分逐字保留,判定由程式執行;預期方向錯誤如實記錄、判準未回改;讀者為模型代理,人類讀者未測。文章由 Claude 根據作者整理的寫作規則起草,作者尚未核對。這篇沒有做 Day 2 那種六個審查者的檢查。
下一篇談 AI 可以同意你,但同意不是證據。